메뉴

#Claude Opus 5

HN
Hacker News • 29일 전
IMP 7

터미널벤치-사이언스: 과학 연구 워크플로에서 AI 에이전트 평가

스탠퍼드 대학 연구진이 주도하고 Terminal-Bench 팀이 개발한 'Terminal-Bench-Science'는 실제 과학자들의 연구 워크플로를 기반으로 AI 에이전트의 과학적 역량을 평가하는 벤치마크입니다. 첫 버전(0.1)은 생명·물리·지구·수학·공학 분야의 70개 과제를 포함하며, 가장 성능이 좋았던 Claude Opus 5의 해결률은 30%에 그쳤습니다. 이 벤치마크는 모델 개발사가 아닌 과학자들이 기준을 설정하고, 최신 AI 발전에 맞춰 지속적으로 진화하는 것이 특징입니다.

벤치마크 AI 에이전트 과학 연구
TD
The Decoder • 62일 전
IMP 9

클로드 오푸스 5, 진정한 지능 벤치마크서 경쟁 모델 압도

Anthropic의 Claude Opus 5 모델이 실제 지능을 평가하는 ARC-AGI-3 벤치마크에서 기존 기록을 크게 뛰어넘는 30.2%를 기록하며 새로운 1위를 차지했습니다. 특히 이 모델은 낯선 환경에서 스스로 규칙을 유추하고 대수학적 표기법을 사용하는 등 이전 AI에서는 볼 수 없었던 고도화된 논리적 추론 능력을 입증했습니다. 하지만 일부 독자적인 테스트에서는 상대적으로 작은 향상만을 보여, 벤치마크 특화 성능 향상일 가능성도 제기되고 있습니다.

Anthropic Claude Opus 5 ARC-AGI